Appearance
Probabilistic record linkage using pretrained text embeddings
DisciplineComputational
MethodComputational
Tagsactive learningcross lingualdata · archival recordslarge language modelsmethod · embeddingmethod · machine learningmethod · regressionrecord linkagetext embeddings
Summary
Problem: 政治学研究中经常需要合并多个数据集,但数据集之间往往缺乏唯一标识变量,必须进行模糊记录链接。现有方法主要依赖词汇相似度(如Jaro-Winkler、Levenshtein距离),这些方法在处理语义相似但词汇不相似的记录(如昵称与法定姓名、组织全称与缩写、跨语言名称)时表现不佳。 Approach: 本文提出fuzzylink算法,将预训练文本嵌入的余弦相似度纳入概率记录链接流程。该算法基于自适应模糊字符串匹配(AFSM)框架,采用主动学习策略:先用零样本提示让大语言模型(GPT-4o)标注初始训练集,拟合逻辑回归模型,再通过不确定性采样挑选模型最不确定的记录对进行标注,迭代直至收敛。 Finding: 在四个政治学应用场景中(候选人-选民档案链接、错拼城市名-人口普查数据链接、利益集团-竞选捐款链接、跨语言政党名称链接),fuzzylink在精确率和召回率上均显著优于现有方法(如fastLink和AFSM),并能完成词汇相似度方法无法实现的跨语言记录链接任务。 Significance: 该方法为政治学研究者提供了一种高效、可扩展且能估计匹配概率的记录链接工具,减少了人工标注成本,提高了下游分析的数据质量与统计功效,并提供了开源软件供学界使用。
Theoretical Framework
N/A
Research Design
本文属于计算方法研究,通过四个实证应用场景来验证所提出算法的性能。分析单元为记录对(record pair)。关键自变量为记录对之间的相似度度量,包括预训练文本嵌入的余弦相似度和Jaro-Winkler相似度;因变量为记录对是否构成真实匹配(二元标签)。算法流程包括六个步骤:嵌入计算、相似度矩阵计算、训练集标注(零样本LLM提示)、拟合监督学习器(逻辑回归)、不确定性采样标注、数据集链接。性能评估指标为精确率(precision)和召回率(recall)。
Data & Sample
本文使用四个数据集:
- 候选人-选民档案:9,025名加州市长和市议员候选人(2016年起)与约2,200万注册选民的L2选民档案,按姓氏和居住城市精确分块,以全名为模糊匹配变量。人工验证样本来自Alameda、Kern和Ventura三个县(840名候选人)。
- 错拼城市名:2021年Paycheck Protection Program(PPP)中661,218名贷款接收者的地址数据(含7,118个错拼城市名),与人口普查局28,889个建制城镇数据,按州分块。
- 利益集团-竞选捐款:2012年签署法庭之友简报的1,388个组织,与DIME数据库中至少8笔独立捐款的组织(约2.9百万中的8%)进行匹配。
- 跨语言政党名称:ParlGov数据被分为两个各含4,972条观测的数据集,一个使用各政党母语名称,另一个使用英文名称,覆盖32个国家、30种语言。
Analytical Strategy
核心分析策略是主动学习循环中的逻辑回归模型,以嵌入余弦相似度和Jaro-Winkler相似度为预测变量,映射到匹配概率。初始训练集为余弦相似度最高的500个记录对,由GPT-4o通过零样本提示自动标注。每轮主动学习迭代标注100个记录对(通过以匹配概率0.5为中心的高斯核进行不确定性采样),直至估计概率变化不超过0.01时停止。最终可选择概率阈值π以最大化期望F1分数。作者在补充材料中进行了消融分析(ablation analysis),检验各算法组件(嵌入相似度、LLM标注、逻辑回归vs随机森林、不确定性采样)的独立贡献,并验证了概率校准情况。
Results & Findings
- 候选人-选民档案链接:fuzzylink识别出770个潜在匹配,精确率95.8%,召回率95.8%。相比之下,fastLink仅识别521个匹配,精确率93.3%,召回率63.1%。召回率的大幅提升主要归功于成功链接了昵称与法定姓名(如"Vinnie"与"Vinton"、"Trish"与"Patricia")以及以中间名参选的候选人。值得注意的是,32个假阳性中有26个涉及亚裔、西语裔或非裔美国人姓名,提示算法可能存在偏差,但匹配概率校准良好(假阳性中位概率22%,真阳性58%),可通过人工验证低概率匹配来消除过半假阳性。
- 错拼城市名链接:AFSM仅识别705个真匹配,精确率65.6%;加入嵌入相似度后提升至1,049个匹配、精确率84.1%;fuzzylink则识别2,451个真匹配,精确率98.0%。fuzzylink成功处理了词汇相似度方法无法解决的案例,如"OKC"→"Oklahoma City"、"Astoria NY"→"Queens NY"(社区名vs城市名)。
- 利益集团-竞选捐款链接:原研究(Abi-Hassan et al. 2023)仅找到376个组织(27%)的DIME分数,而fuzzylink在仅搜索8%的DIME数据的情况下找到437个组织。改进的召回率主要来自识别组织的替代名称(如"Utah Association for Justice"与"Utah Trial Lawyers Association")和曾用名(如"Airlines For America"原为"Air Transport Association of America")。939个建议匹配中仅3个假阳性,精确率99.6%。
- 跨语言政党名称链接:fuzzylink能够跨语言链接政党名称(如德语"Österreichische Volkspartei"与英语"Austrian People's Party"),这是词汇相似度方法无法完成的任务。
Limitations
作者承认以下局限:
- 嵌入模型训练数据截至2021年9月,若链接需要2021年后的事件知识,方法可能表现不佳。
- 使用OpenAI专有模型(嵌入和标注)可能影响可复现性;开源模型虽可完全复现但准确率较低。
- 算法存在潜在偏差:在候选人-选民档案应用中,假阳性不成比例地涉及少数族裔姓名。
- 本文仅处理单一模糊匹配变量(可含多个精确分块变量)的场景,多模糊匹配变量的扩展仅在讨论中提及。
- 跨编码器(cross-encoder)方法可能提高准确率,但因计算复杂度为二次方而未采用。
Key Contributions
- 提出fuzzylink算法,首次将预训练文本嵌入相似度系统性地纳入概率记录链接框架,同时保留匹配概率估计的优势(无需任意阈值、可纳入下游不确定性分析)。
- 用大语言模型零样本提示替代人工标注,大幅降低主动学习的人工成本和时间。
- 通过四个政治学应用场景全面验证方法性能,证明在精确率和召回率上均显著优于现有方法(fastLink、AFSM)。
- 首次展示跨语言记录链接在政治学数据中的可行性,拓展了比较政治和国际政治研究的数据合并能力。
- 提供开源统计软件,便于研究者高效实施该方法。
Key Claims
"Pretrained text embeddings are a fast and scalable method for determining whether two texts have similar meaning, capturing not only lexical similarity, but semantic similarity as well." (Abstract)
"What distinguishes the current article from previous work is that it incorporates embedding similarity into a probabilistic record linkage procedure." (Section 1, Introduction)
"Across a series of political science applications, I show that this approach significantly improves both precision and recall over existing approaches, and can even perform some tasks—like multilingual record linkage—that would be impossible using lexical similarity measures alone." (Section 1, Introduction)
"It is worth noting, in light of ongoing debates over algorithmic bias in language models (Abid, Farooqi, and Zou 2021; Grossmann et al. 2023), that a disproportionate share of false positive matches (26 out of 32) are Asian, Hispanic, or African American names." (Section 3.1, Linking Candidates to Voter File Records)
"The fuzzylink algorithm dramatically improves over both these approaches, more than doubling the number of true matches recalled with near-perfect precision." (Section 3.2, Linking Misspelled City Names to U.S. Census Bureau Records)